List of Flash News about SWE Bench Pro
| Time | Details |
|---|---|
|
2026-06-30 00:00 |
OpenAI: SWE-Bench Pro Benchmark Reliability Issues
OpenAI analysis flags flaws in SWE-Bench Pro benchmark methodology and known limitations, exposing accuracy gaps in AI coding agent evaluation benchmarks reliability issues. |
|
2026-05-29 04:02 |
Claude Opus 4.8: Hits 69.2% on SWE-Bench Pro
Claude Opus 4.8 scores 69.2% on SWE-Bench Pro for agentic coding leadership while adding honesty cues and remaining available at prior pricing via EasyRouterIO. |